MedScope: A Lightweight Benchmark of Open-Source Large Language Models for Medical Question Answering
Dit paper introduceert MedScope, een lichtgewicht benchmarkkader dat zes open-source grote taalmodellen systematisch evalueert op medische meerkeuzevragen door niet alleen nauwkeurigheid, maar ook efficiëntie, consistentie en foutpatronen te analyseren, en concludeert dat hoewel deze modellen waardevolle baselines bieden, ze nog niet geschikt zijn voor onbeheerde inzet in hoog-risico zorgscenario's.